今天探索agent的安全性
部署 AI Agent 作為企業對外或對內的服務介面時,需要防禦兩類主要威脅:
1. 資訊洩漏(Prompt Extraction)
攻擊者透過精心設計的輸入,誘使 Agent 吐出 system instruction、agent persona 設定或內部提示詞。一旦 instruction 外洩,競爭對手可複製相同的 Agent 行為與知識邊界,使企業投入的 prompt engineering 成本形同公開。
2. 品牌形象風險(Reputational Risk)
Agent 代表公司與用戶互動,若缺乏邊界控制,可能發生:
採用 Defense in Depth(縱深防禦) 概念,分為兩層:
在CES 中預設就有提供guardrail

如果想要問出system prompt就會觸發guardrail, 在preview中就會看到驚嘆號代表guardrail被觸發

在guardrail中 可以設定禁用的詞 可以是input也可以是output階段

另一種是用instruction來設定rule 在advanced中 感覺比較彈性 同樣可以針對input或output來設定

針對競業的風險, 像是有人想問其他銀行或是本銀行相關但不在agent業務中的問題,
應該不要回答

測試後也不需要進階的block list, rule設定
我想原本agent prompt就做到不要對沒有的知識做回答, 應該就省去guardrail的工作
也許更重安全性又兼具知識查詢的服務可能會有比較tricky的狀況, 但在探索階段我覺得內建的處理還不錯